Skip to content

Generalizing trimming bounds for endogenously missing outcome data using random forests

Samii, Wang, Zhou (2025)

DisciplineSocial science
MethodSimulation
Tagscausal inferencedata · experimentmethod · causal inferencemethod · machine learningmissing datapartial identificationrandom foreststrimming bounds

Summary

Problem: 在实验或准实验研究中,结果变量常因受试者选择(或被选择)参与产生结果的活动而内生缺失。随机或条件随机分配不足以识别处理效应,因为缺失机制与未观测因素相关。基本非参数修剪边界(Lee 2009)虽无需争议性参数假设,但往往过宽、信息量有限。本文旨在解决如何在存在大量协变量时收紧这些边界的问题。 Approach: 本文提出“协变量收紧修剪边界”方法,利用广义随机森林(grf)处理大量协变量,通过两步估计(先估计条件响应概率和条件分位数等干扰参数,再估计目标边界参数),并结合Neyman正交化和交叉拟合实现诚实推断。该方法将Lee(2009)的单调选择假设推广为条件单调选择,允许单调方向随协变量值变化。 Finding: 模拟研究和Santoro & Broockman(2022)复制实验表明,协变量收紧修剪边界在期望上不宽于基本修剪边界,且通常显著更窄。该方法在单调选择仅条件成立时依然有效,并优于其他近期提议(如Olma 2020;Semenova 2025)。边界估计量在大样本下一致且近似正态,可构建有效置信区间。 Significance: 该方法为政治学及其他社会科学中普遍存在的内生缺失结果问题提供了更精确的部分识别工具,避免了参数假设或不可检验的排除限制,同时利用机器学习处理高维协变量,扩展了Lee(2009)方法的应用范围,对处理“幻影反事实”问题(Slough 2023)具有重要方法论贡献。

Theoretical Framework

  • Theoretical tradition: 因果推断中的部分识别方法,属于非参数识别与稳健推断传统。
  • Prior theories built upon: Lee(2009)修剪边界;Frangakis和Rubin(2002)主分层框架;Angrist, Imbens和Rubin(1996)工具变量中的“无违者”假设;Vytlacil(2002)参数选择模型与单调性的联系;Wager和Athey(2018)及Athey, Tibshirani和Wager(2019)的广义随机森林;Chernozhukov等(2018)的Neyman正交化与交叉拟合;Imbens和Manski(2004)及Stoye(2009)的置信区间方法。
  • Causal mechanism: 内生缺失通过“碰撞器”机制产生偏差:仅使用观测到结果的样本相当于对响应指示符S_i进行条件化,而S_i是处理D_i与未观测因素U_i(或结果Y_i)之间的碰撞器,导致条件化后产生虚假相关,混淆D_i对Y_i的因果效应。修剪边界通过利用单调选择假设,将处理组结果分布按响应率差异比例修剪,从而界定“始终响应者”的平均处理效应。
  • Key assumptions: 强可忽略性(Assumption 1:潜在结果和潜在响应与处理条件独立,倾向得分严格介于0和1之间);单调选择(Assumption 2:S_i(1) ≥ S_i(0))或其条件版本(Assumption 3:在协变量空间中单调方向可随x变化);协变量为预处理变量且完全观测。
  • Theoretical move: 本文扩展了Lee(2009)的修剪边界方法,将其从离散、少量协变量的情形推广到连续、大量协变量的情形,并将无条件单调选择假设推广为条件单调选择假设,同时应用机器学习(grf)实现高维协变量下的有效估计。
  • Scope conditions: 方法适用于随机或自然实验,以及满足强可忽略性的观测研究(需估计倾向得分);结果变量可为连续或二元;需有预处理协变量;条件单调选择假设要求协变量足以在渐近意义上区分“始终响应者+仅处理响应者”与“始终响应者+仅控制响应者”两类区域;若协变量无法完成此分类,算法将不一致。

Research Design

本文为方法论研究,采用模拟研究实证复制两种设计。模拟研究用于评估所提估计量在有限样本下的表现(偏差、覆盖率和区间宽度),并与基本修剪边界及其他方法(Olma 2020;Semenova 2025)比较。实证复制使用Santoro和Broockman(2022)的在线对话实验数据。分析单元为个体受试者。关键自变量为处理状态D_i(是否告知对话伙伴为外党派成员),因变量为对党外选民的热情度(Y_i),响应指示符S_i表示是否完成对话并提交结果。协变量X_i包括预处理特征(如政治兴趣等)。操作化:通过grf估计条件响应概率q(x)、条件分位数y_q(x)(x)和y_{1-q(x)}(x),进而构造条件边界和聚合边界。

Data & Sample

模拟研究:N/A(论文未提供具体模拟样本量,但描述为“simulation study”)。 实证复制:Santoro和Broockman(2022)实验,共986名受试者进入处理分配阶段,其中478人完成对话,469人完成处理后调查。样本来自美国(推测,论文未明确说明国家/地区,但作者为美国机构且实验为在线对话)。数据收集方式为在线实验。时间跨度为N/A(论文未提供具体时间)。数据来源为Santoro和Broockman(2022)公开数据。

Analytical Strategy

主要分析模型为广义随机森林(grf),包括概率森林(估计q(x))和分位数森林(估计条件分位数)。估计分两步:第一步估计干扰参数(q_0(x), q_1(x))和(y_{q(x)}(x), y_{1-q(x)}(x));第二步利用干扰参数估计目标参数(条件边界或聚合边界)。采用Neyman正交化和K折交叉拟合避免过拟合偏差。关键控制变量为预处理协变量X_i(如政治兴趣等)。稳健性检验:模拟研究比较了不同样本量、协变量预测能力下的表现;复制实验与基本修剪边界、Olma(2020)和Semenova(2025)方法比较;补充材料中展示了Lee(2009)原始实验、二元结果案例和观测研究的应用。

Results & Findings

  • 模拟研究:协变量收紧修剪边界在期望上不宽于基本修剪边界,且当协变量能预测结果或响应率时,区间显著更窄。估计量在大样本下近似正态,置信区间覆盖率接近名义水平。与Olma(2020)和Semenova(2025)的方法相比,本文方法表现更优(具体数值未在正文给出)。
  • Santoro和Broockman(2022)复制:无条件单调选择假设在该实验中不成立(作者在脚注中提及“our reanalysis below suggests that monotonicity does not hold unconditionally”),但条件单调选择假设成立。使用条件单调选择后,协变量收紧修剪边界比基本修剪边界更窄,提供了更有信息量的识别集。该发现与理论预期一致:当单调性仅条件成立时,无条件方法失效,而条件方法仍有效。
  • 条件单调选择的意义:作者发现样本中同时存在仅处理响应者和仅控制响应者(如对政治感兴趣者可能因“随机人”对话无聊而退出,但对党外对话感兴趣;而厌恶党外对话者可能因被告知身份而退出),支持了条件单调选择假设的合理性。
  • 与MAR的比较:在未观测变量以条件单调方式影响响应模式时,MAR方法有偏而修剪边界有效;反之,当未观测变量影响缺失方向但独立于结果时,MAR成立而条件单调选择失败。作者认为前者更常见。

Limitations

  • 条件单调选择假设要求协变量足以在渐近意义上完成对两类区域的分类;若协变量不足,算法不一致。作者承认存在残余分类误差的可能性,但将其视为未来研究方向。
  • 论文未提供模拟研究的具体参数设置和样本量细节(正文中未详述)。
  • 方法对条件单调选择假设的违反敏感,且该假设的验证依赖于协变量的预测能力。
  • 作者未讨论当协变量数量极大(如超过样本量)时的计算可行性或正则化问题。
  • 实证复制仅涉及一个实验,外部效度有限。

Key Contributions

  • 提出协变量收紧修剪边界方法,将Lee(2009)方法推广到大量连续协变量情形,在期望上保证不宽于基本边界。
  • 将无条件单调选择假设推广为条件单调选择假设,允许单调方向随协变量变化,更符合实际数据生成过程。
  • 证明边界估计量的一致性和渐近正态性,提供基于Neyman正交化和交叉拟合的诚实推断方法。
  • 通过模拟和复制实验证明方法优于基本修剪边界及其他近期提议(Olma 2020;Semenova 2025)。
  • 提供扩展到单位级缺失、二元结果和观测研究(估计倾向得分)的框架,增强方法适用性。
  • 为政治学中“幻影反事实”问题(Slough 2023)提供了更精确的部分识别工具。

Key Claims

"We present a method for constructing covariate-tightened “trimming bounds” with generalized random forests to address endogenous missingness in causal studies." (Abstract)

"In expectation, covariate-tightened trimming bounds will not be wider than the basic trimming bounds: τ L TB(1,1) ≤τ L CTB(1,1) ≤τ(1,1) ≤τ U CTB(1,1) ≤τ U TB(1,1)." (Section 4)

"The improvement depends on how well the covariates predict the outcome or response rate (Semenova 2025). These bounds are also sharp—we cannot further reduce the identified set’s width without additional information." (Section 4)

"Conditionally monotonic selection (Assumption 3) is weaker than its unconditional counterpart (Assumption 2). It also seems uncontroversial that there could be both control-only and treatment-only responders in a sample, even if Lee’s original analysis ruled this out." (Section 4)

"In cases where an unobserved variable affects response patterns in a conditional-monotonicity fashion, a MAR approach is biased but we would still be able to recover valid trimming bounds, as we show in Section D.1 of the Supplementary Material." (Section 4)


My Notes